메뉴

#수학 추론

TD
The Decoder 46일 전
IMP 8

클로드 페이블 5, 최고난도 수학 벤치마크에서 GPT-5.5 제압

Anthropic의 최신 모델인 Claude Fable 5가 최고난도 수학 벤치마크인 FrontierMath에서 88%의 정확도를 기록하며 OpenAI의 GPT-5.5를 13점 차이로 크게 앞섰습니다. 이는 불과 반년 전만 해도 최고난도 문제 정답률이 10% 미만이었던 점을 고려하면 AI의 수학적 추론 능력이 비약적으로 발전했음을 보여줍니다. 이러한 성능 향상은 단순한 벤치마크를 넘어, 오랜 미해결 수학 난제를 실제로 해결하는 등 실제 현실 세계에도 큰 파급력을 미치고 있습니다.

Anthropic OpenAI 수학 추론
TD
The Decoder 73일 전
IMP 7

새 수학 벤치마크: AI의 자신만만한 허위 해답 폭로

카네기멜론대, 서울대 등 컨소시엄이 전 세계 64명의 수학자들과 함께 대규모 언어 모델(LLM)의 수학적 추론 능력을 평가하는 새로운 벤치마크 'SOOHAK'를 발표했습니다. 이 벤치마크는 기존 평가들이 간과했던 '풀 수 없는 문제(오류가 포함된 문제)를 얼마나 잘 걸러내는가'를 테스트하여, AI 모델들이 오류를 인지하지 못하고 자신만만하게 잘못된 답을 도출한다는 치명적인 약점을 밝혀냈습니다.

인공지능 평가 벤치마크 수학 추론